小红书开源FireRed-OCR,2B 参数登顶文档解析榜单
来自小红书超级智能团队的FireRed-OCR,以仅 20 亿参数的轻量模型,在权威文档解析基准 OmniDocBench v1.5 上拿下端到端方案第一,综合得分 92.94%,超越 Gemini 3.0 Pro、DeepSeek-OCR…
27 0 0
来自小红书超级智能团队的FireRed-OCR,以仅 20 亿参数的轻量模型,在权威文档解析基准 OmniDocBench v1.5 上拿下端到端方案第一,综合得分 92.94%,超越 Gemini 3.0 Pro、DeepSeek-OCR…
来源丨AI音频时代 新泽西理工学院(NJIT)和纽约大学(NYU)的研究人员正在通过一项新资助的项目,共同在数字无障碍领域取得突破性进展,该项目旨在让在线视频内容对聋人和听力障碍(DHH)观众更具包容性。 在未来三年内,凭借美国国家科学基金…
来源丨机器之心 OpenAI 要略过 GPT-5.3,直接迈向 GPT-5.4 了? 近日,一名 OpenAI 工程师在公开的 Codex GitHub 仓库中提交了一则拉取请求(PR),无意间让 GPT-5.4 这一型号出现在代码版本判断…
在传统语音生成中,表达方式往往依赖预设标签,例如: 固定情绪选项 预定义语气类别 限定风格模板 用户只能在有限选项中选择,而难以进行更自由、细腻的表达控制。 FreeStyle 新范式的核心突破在于 不再依赖固定标签,而是支持通过自然语言指…
标题:Eureka-Audio: Triggering Audio Intelligence in Compact Language Models 链接:https://arxiv.org/pdf/2602.13954 发表日期:2026年…
来源丨机器之心 在全球具身智能领域的顶级权威评测 WorldArena 榜单中,清华陈建宇(星动纪元创始人)团队联合斯坦福 Chelsea Finn(PI 创始人) 团队研发的 Ctrl-World 世界模型交出优异答卷: 具身任务能力斩获…