研发工程师(AI 陪伴产品方向)
用人方:远程团队(名称在约面时告知)
把已经跑通的中文实时语音原型,做成能长期使用、主动但不越界、可持续演进的 AI 陪伴产品。我们不缺会接 API 的人,缺能对角色体验、完整链路和工程结果负责的人。 一、我们在做什么 我们在做一款面向成年用户的中文 AI 陪伴产品。项目不是 PPT 阶段:ASR → 角色模型 → 动态语音合成的实时链路已经跑通,支持流式对话与打断,并已有自动测试、逐轮指标和固定评测集。当前优先完成 P0 可靠性验收,随后推进 P1 长期记忆与关系连续性,以及 P2 实时多模态 / Avatar 旁路 POC。 当前产品聚焦一对一语音陪伴;未来底层能力需要能够演进到文本、语音 / 视频通话、剧情模式、主动消息、群聊与用户自建角色,但不会为了功能数量牺牲长期陪伴质量。 现有模型与供应商是可复现的技术基线,不是永久绑定。我们真正关心的是:听完整、听得懂、像同一个人、说得自然、记得准确且可控,并且在需要时能合理拒绝。 二、什么叫“好的 AI 陪伴” • 角色一致:根据角色设定稳定表达,长对话中不随意改身份、价值观、关系和语言风格。 • 主动而不打扰:不只被动回答,能结合上下文、关系状态和时间信息自然带节奏;主动消息有触发条件、频控和失效时间。 • 有情绪与共情:能感知用户情绪变化,并让内容、语气、节奏和声音表演一致,而不是只输出安慰套话。 • 有边界:不会无脑赞同、顺从或诱导依赖,能按照角色、关系阶段与安全规则做自然且一致的拒绝。 • 丰富但不失控:降低重复和固定 Pattern,能支持密聊、剧情等不同交互模式,同时保持事实、逻辑和人设约束。 • 记忆可控:区分短期上下文、用户画像、事件记忆与关系事件;记忆有来源、可纠正、可删除、可隔离。 三、你将负责 • 实时交互链路:优化音频采集与降噪、VAD / ASR、流式生成、TTS、WebSocket / RTC、打断、回声、编解码、延迟和失败恢复。 • 角色与对话系统:建设角色模版 / Profile、上下文编排、结构化输出和对话状态;持续提升人设稳定、主动性、情绪共鸣、合理拒绝与内容丰富度。 • 记忆与关系系统:建设短期 / 长期记忆、用户画像、RAG / 向量检索和关系状态机,完成来源追踪、冲突处理、纠正、删除与多身份隔离。 • 多模型 / Agent 编排:按需要拆分密聊、剧情、创作辅助、关系判断、记忆召回和群聊中控等能力;不把所有问题都塞进一个 Prompt 或一次模型调用。 • 多端与多模态演进:支撑 Web、PC、移动端的 IM / 实时音视频接入;以旁路方式验证端到端语音、视频理解、Avatar 与音画同步,不让视觉层拖垮主对话链路。 • 评测与数据闭环:把人设、主动性、共情、拒绝、重复率、记忆准确性等主观体验转成固定样本、人工量表和版本化指标,并维护 P50 / P 95、失败样本和真实会话验收。 • 技术与供应商演进:抽象 ASR、LLM、TTS、记忆、审核和实时会话接口;完成小规模旁路 POC、变量隔离 A/B、灰度、降级和回退。 • 产品化工程:处理配置、密钥、权限、日志、监控、会话隔离、异常重试、成本和可复现部署,让系统不依赖某个人手工救火。 • 安全与隐私:把 AI 标识、内容边界、内容审核、反依赖、极端情绪处理、数据最小化与删除闭环写进产品能力。 四、硬性要求 • 成熟项目经验:至少 1 个你深度参与、能够现场演示的成熟项目。公司项目、创业项目、开源项目或个人项目都可以;是否名企、是否科班不是第一筛选项。 • 后端与实时工程:以 Python 为主要开发语言,并熟悉异步服务、HTTP / WebSo
咨询时报上岗位编号 JD-0354,顺手附上简历,匹配更快。全程不收任何费用。