有问题,一起解决。向专家与同行提问,分享你的 AI 实战经验。
团队目前用 A100 跑 70B 模型,推理延迟约 3-4 秒,用户反馈偏慢。想了解大家在实际项目中是如何做推理加速的,是否有更经济的 GPU 配置方案?
目前在做一个知识库问答系统,发现 Top-K 设太小会漏召回,设太大会引入噪声影响生成质量。大家一般怎么调这个参数?有没有自动化方案?
用 Pandas 读取一个 2GB 的 CSV 文件,内存直接爆了。试过分块读取但后续聚合操作很麻烦。有没有更好的方案?Polars 值得切换吗?
JSON Mode 有时还是会出错,特别是嵌套结构复杂时。想了解大家在工程实践中是怎么保证输出格式稳定性的,有没有用过 Function Calling 来约束格式?
需要在公司内部搭建统一的 AI 服务管理平台,支持多模型路由、版本管理、灰度发布、成本监控等功能。有没有成熟的开源方案可以参考?